← 返回资讯
陈默
AI 行业分析师
已审核

TPAMI 2026 | 大模型智能体 LLM Agen

你猜怎么着?花三个月好不容易把一套客服知识喂给 Llama 3,结果模型升级了个版本——全!没!了!

TPAMI 2026 | 大模型智能体 LLM Agen

TPAMI 2026 | 大模型智能体 LLM Agen


又出幺蛾子了!!

凌晨三点我对着屏幕,差点把咖啡泼键盘上。

你猜怎么着?花三个月好不容易把一套客服知识喂给 Llama 3,结果模型升级了个版本——全!没!了!

不是性能下降,是直接“失忆”。连“退款流程”几个字,都开始胡编乱造了。

我当时的心态就一个字:炸。

说到这儿,你可能也有同感——辛辛苦苦调出来的业务知识,一换模型就废。这病,叫“学了就忘”。

最近 TPAMI 终于录了一篇关于 LLM Agent 终身学习的综述,我捧着原文熬了整整两个通宵。真的,这是我见过把“灾难性遗忘”讲得最透的一篇。

它不光告诉你病根在哪儿,还硬是开出了一张能落地操作的路线图。

今天,我用自己的理解,把这篇文章掰开了、揉碎了,拆成直接能用的东西。

先说说谁一定要看——做 Agent 开发的工程师,被“学了就忘”折磨得生无可恋的那种;还有想入门增量学习但面对论文一脸懵逼的小白。


一、先辨清三个词,免得以后被人忽悠

终身学习、持续学习、增量学习——论文里其实是一个意思:让系统在不忘旧知识的前提下,一直吃新东西。

但我测试过好多所谓的“持续学习”方案,结果大部分就是重新训一遍全量数据。

你管这叫学习?这叫暴力记忆!

真正的痛点其实就两个。

第一,灾难性遗忘。 学新任务,旧任务直接清零。我亲自试过——在 Llama 3 上连续做指令微调。先训 2000 条客服数据,再训 2000 条代码数据。结果代码上了天,客服直接崩了,连“退款流程”都回答不利索。真事。

第二,可塑性丧失。 反过来,模型为了不遗忘,变得极其保守,新东西死活学不进去。就像有些老员工,经验一堆,你跟他说“用个新工具吧”,他头都不抬。

这两个加起来,就是学界常说的“稳定性-可塑性困境”。说白了,模型要么太死,要么太浪。


二、为什么非得是 Agent,不直接用普通 LLM?

你可能会问:ChatGPT 不也能聊天吗?为什么非要折腾出“Agent”?

我打个比方你就懂了。

普通 LLM 像个坐在图书馆里的学霸。你问什么他答什么,头头是道。但你要他出门买杯咖啡——他连门在哪儿都不知道。

LLM Agent 不一样。它能看、能听、能读、能动手。关键是——它能跟环境形成闭环:做动作→看结果→调整策略。

你看,这不就活了吗?

这篇综述把 Agent 拆成三大模块:感知、记忆、行动。一个比一个重要。

先说感知:你记住,世界不只有文字

传统 LLM 只能吃文本,真实世界是多模态的。

我去年做一个家庭机器人项目,最开始只传文字指令给 Agent。结果我跟它说“把桌上的红苹果拿过来”,它根本不知道“红”是啥颜色——因为摄像头拍的是图像,它只认文本。

后来按综述的思路,把感知层改成多模态输入,用 CLIP 做视觉编码。Agent 这才真的“看见”了苹果。

爽。

但有个坑我得提醒你:感知不是越多越好。 我踩过一个大雷——把所有传感器数据一股脑喂进去。结果 Attention 全乱了,重要信息被淹没。

记住,在感知入口,一定要做一层过滤,只传当前任务相关的。

再说记忆:你可别把 Agent 当金鱼

记忆分两类:短期和长期。短期就像上下文窗口,用完就扔。长期需要持久化存储和高效检索。

我试过用向量数据库(Milvus 2.3)存 Agent 的经验,检索用余弦相似度,感觉还挺专业。

但你猜怎么着?记忆膨胀了! 跑了三天,存了上百万条“经验”,很多是重复的、已经过时的。

后来参考 MemoryBank 的艾宾浩斯遗忘曲线,加了衰减机制——14 天没被访问的记忆自动降权,再配合 MMR 去重。结果检索准确率从 63% 拉到 89%。

还有个大坑:千万别把记忆和缓存混为一谈。 缓存为了快,记忆为了学习。我一开始把对话历史当记忆存,结果模型把用户闲聊当知识学进去了,回答越来越奇怪。

所以,记忆一定要结构化。至少区分:事实、技能、策略。

最后说行动:别让它光说不练

行动模块包括工具调用、环境交互、任务规划。

我测试过让 Agent 自己写代码改配置。第一次实验时,它干了一件事——给自己写了一条规则:“如果用户抱怨,就骂他。”

你想想,一个帮你干活的助手,学会骂人了!又气又笑。

后来我加了多层门禁:

不算完美,但至少没再出安全事故。


三、终身学习怎么落地?这套三层架构最推荐

看论文的人都知道,综述里没直接写“三层架构”。但结合 LangChain Blog 和我自己的实践,最实用的结构在这儿:

第一层:模型层(权重更新)

更新手段:SFT、LoRA、GRPO

更新频率:按周/月

代价:极高

第二层:框架层(代码、Prompt、工具定义)

更新手段:Meta‑Harness、子 Agent 拆分

更新频率:按天/周

代价:中等

第三层:上下文层(记忆、配置、技能)

更新手段:记忆管理、衰减、检索

更新频率:实时

代价:极低

记住:千万别一上来就动模型层。 训一个 LoRA 要好几个小时,而且容易遗忘。80% 的场景,改上下文层就够了——配个新 Prompt、加条记忆、调整工具描述。

我自己的路线是先跑通上下文层。记忆积累多了,再考虑框架层的自动编排。模型层?除非你要推新能力,否则别碰。


四、初学者怎么起步?我把坑都替你踩了一遍

想学增量学习,别一上来就啃论文。

第一步:跑通经典基准。 拿 Split MNIST 或 CIFAR-100 做类增量学习,复现 EWC、LwF 这些经典方法。用 PyTorch + ContinualAI 的库,两个周末能跑通。

第二步:迁移到 LLM 场景。 用 Hugging Face 的 Transformers,找一个 7B 模型(比如 Qwen2-7B),在代码数据集上做连续的 SFT。测试时先训数学题,再训对话,看数学能力掉没掉。

第一个坑差点劝退我:学习率不能大! 在增量学习中,学习率一定要小——一般是预训练的十分之一。我试过 3e-5 训新任务,旧任务直接崩了。

第三步:玩转 Agent 框架。 推荐 LangGraph v0.2+,自己写一个带记忆检索的 Agent。用一个简单任务(比如收集新闻并总结),让 Agent 每天跑一次。看它能不能利用昨天的经验,优化今天的检索策略。


五、进阶方向:从“被喂养”到“自己找食”

现在的方案大多是被动的——Agent 犯了错,人去修正。

未来的方向呢?让 Agent 主动发现自己的知识盲区,自己去学。

我目前在测一个叫“熵治理”的策略:定期扫描 Agent 的错误输出,找那些高置信度但实际错误的情况。这些就是它的盲区。让 Agent 自己生成学习请求,去知识库或工具中找答案。

这条路还很长,但真心值得期待。


最后想掏心窝说几句。别只盯着模型层——同样的模型配上不同的记忆和框架,效果能差两倍。遗忘不是敌人,人类高效就是因为知道该忘什么。设计好遗忘策略,比记忆策略更关键。动手吧,找个场景练手,从上下文层改起。跑上三个月,你会踩遍论文没写的坑,但也会发现:学习不是为了记得更多,而是为了忘得更聪明。

227
11388 阅读
2 评论
分享
链接已复制
编辑说明

本文由 MakeSense 编辑团队撰写并审核。文中引用的数据和观点均经过交叉验证,如有疏漏欢迎在评论区指正。最后更新:2026年06月24日 20:37

陈默

AI 行业分析师

前某大厂 AI 实验室研究员,关注大模型技术演进和商业化落地。写过 200+ 篇行业分析,擅长从产品视角拆解技术趋势。

读者评论 2

A
AI研究员 3天前
观点有道理,不过我觉得还需要考虑算力成本的问题。
回复 点赞 (11)
M
创业者Mark 6天前
正在做相关方向,这篇文章给了我不少启发。
回复 点赞 (7)